Bivariační analýza (dvourozměrné distribuce)

Vzorečky na statistiku#Binomický rozdělovací vzorec

Shoda

pozitivní souvislost - nízké hodnoty jedné se potkávají s nízkými hodnotami druhé, podobné potkávání u vysokých hodnot

Protiklad

negativní souvislost - nízké s vysokými a naopak

Nezávislost

neexistenci souvislosti - nepozorujeme pravidelnost

Možnosti zpracování

Tabulkové (kontingenční), krostabulace
Grafické znázornění - bodový graf
Numerické charakteristiky - korelační a kontingenční koeficienty

Tabulkové zpr.

nezávislá a závislá prom
Nejčastěji bývá závislá nalevo v řádcích a nezávislá (vysvětlující) ve sloupcích

Osobní pohoda muž žena Sum
1 nespokojen 5 (41%) 2 (22%) 7
2 5 (41%) 1 (11%) 6
3 spokojen 2 (16%) 6 (66%) 8
Sum 12 (100%) 9 (100%) 21

Interpretace tabulek

závislá - ovlivňována, způsobována (nejčastěji v řádcích)
nezávislá - ovlivňuje, vysvětluje závislou (sloupce)

Pozor

Směr kauzality je vždy věcí teorie, nelze ji určit z dat samotných

Explanační interpretace dvourozměrné tabulky

  1. osoby rozdělíme do podskupin podle úrovní nezávislé proměnné (muži/ženy)
  2. Každá podsk. popsána podle hodnot proměnné (např. osobní pohoda)
  3. Tabulku čteme tak, že porovnáváme navzájem podskupiny nezávislé proměnné (muži/ženy) podle hodnot závislé proměnné (osobní pohoda). Smysluplné je porovnávat distribuce napříč kategoriemi nezávislé proměnné

Relativní četnosti

Souvislost znaků v tabulce (dvě závislé proměnné)

Korelace

vztah (souvislost, asociace) mezi dvěma proměnnými, jejichž hodnoty jsou uspořádány ve dvojicích

Korelační koeficient

Interpretace hodnot korelačního koeficientu v sociálních vědách (detailnější členění)

0,01 - 0,09 triviální, žádná
0,10 - 0,29 nízká až střední
0,30-0,49 střední až podstatní
0,50-0, 69 podstatná až velmi silná
0,70 - 0,89 velmi silná
0,90 - 0,99 téměř perfektní

Důležité vlastnosti korelačního koeficientu

  1. Platí -1 -< r -< +1
  2. Jestliže |r| = 1, leží všechny body na přímce
  3. Jestliže r = 0, nazýváme X a Y nekorelované proměnné. Dvě náhodné proměnné jsou tím více korelovány, čím blíže je hodnota r k číslům +1 nebo -1. V tom případě lze vztah obou proměnných dobře vyjádřit

Druhou mocninou koeficientu korelace je koeficient determinace, jeho stonásobek udává, z kolika procent jsou změny hodnoty závisle proměnné Y vysvětlovány hodnotami nezávisle proměnné (proměnných), tj. vypočtenou regresní funkcí.
Stupnice těsnosti závislosti podle koeficientu determinace je zhruba takto:
r2 < 10 %těsnost nízká
10 % r2 < 25 %těsnost mírná
25 % r2 < 50 %těsnost význačná
50 % r2 < 80 %těsnost velká
80 % r2 těsnost velmi vysoká

$

Statistika na první test

Pearsonův

popisuje lineární vztah mezi dvěma kvantitativními proměnnými.

předpoklady, které musí data splňovat, pokud chcete použít Pearsonovo r:

  • Obě proměnné jsou na intervalové nebo poměrové úrovni měření
  • Data z obou proměnných mají normální rozdělení
  • Vaše data nemají žádné odlehlé hodnoty
  • Vaše data pocházejí z náhodného nebo reprezentativního vzorku
  • Očekáváte lineární vztah mezi dvěma proměnnými

je parametrický test, takže má vysoký výkon

Ale není to dobré měřítko korelace, pokud mají proměnné nelineární vztah nebo pokud data mají odlehlé hodnoty, zkreslená rozdělení nebo pocházejí z kategorických proměnných

Vzorec
r=∑(xi−x¯)(yi−y¯)∑(xi−x¯)2∑(yi−y¯)2

$

Statistika na první test

Spermanův

nejběžnější alternativou k Pearsonově

Je to korelační koeficient pořadí, protože používá pořadí dat z každé proměnné (např. od nejnižší po nejvyšší) spíše než samotná nezpracovaná data

Spearmanův byste měli použít, když vaše data nesplňují předpoklady Pearsonova

K tomu dochází, když je alespoň jedna z vašich proměnných na ordinální úrovni měření nebo když data z jedné nebo obou proměnných nesledují normální rozdělení.

Zatímco Pearsonův korelační koeficient měří linearitu vztahů, Spearmanův korelační koeficient měří monotónnost vztahů

V lineárním vztahu se každá proměnná mění v jednom směru stejnou rychlostí v celém rozsahu dat

V monotónním vztahu se také každá proměnná vždy mění pouze jedním směrem, ale ne nutně stejnou rychlostí.

  • Pozitivní monotónní: když se jedna proměnná zvyšuje, zvyšuje se i druhá.
  • Negativní monotónní: když se jedna proměnná zvyšuje, druhá klesá.

Vzorec:
Základní
ρ=1−6∑(xi−yi)2n(n2−1)
Upravený o diviaci di - rozdíl mezi x a y
$\rho = 1 - \frac{6\sum (d_i)^2}

Profajnšmekry,kompletněupravený\rho = 1 - \frac{6\sum (d_i)^2}{n^{3}-n}
$

$

Statistika na první test

Kendalův

  • měří vztah mezi dvěma sloupci seřazených dat
  • není potřeba aby data byla normálně rozdělena

Vzorec
C - konrodtantní, +, jsou větší, souhlasné páry
D - diskonkordatní, -, jsou měnší, nesouhlasné páry

τ=C−DC+D

Příklad

Dva učitelé seřadí 12 svých žáků od nejhoršího po nejlepšího. Máme dva sloupce hodnocených dat, je vhodné použít Kendalla
Budeme se dívat pouze na pozice u Učitele dva.

Hráč Učitel 1 Učitel 2
Aj 1 1
Ben 2 2
Ellito 3 3
Conner 4 5
Duane 5 4
Frank 6 7
Greg 7 6
Hank 8 8
Isaiah 9 10
Jim 10 9
Kurt 11 11
Luke 12 12

Regresní a korelační analýza

Volnou (nebo statistickou) závislostí rozumíme takový vztah
proměnných, kdy stejné hodnotě Xi nezávisle proměnné X při
opakovaném měření neodpovídá vždy shodná hodnota závisle
proměnné Y, ale celé pole rozdílných hodnot proměnné Y.
Se změnou hodnot nezávisle proměnné X (event. proměnných XI,
Xk) se mění i úroveň hodnot (tj. střed pole hodnot) závisle proměnné Y.

Při regresní a korelační analýze prakticky vždy
řešíme dvě základní úlohy:
Změřit těsnost zkoumané závislosti, tzv. korelaci.
Vyjadřujeme a hodnotíme ji podle vypočtených hodnot
charakteristik korelace a determinace.
Zjistit a vhodně vyjádřit průměrný průběh závislosti, tzv.
regresi. Vyjadřujeme ji výpočtem parametrů vhodné
regresní funkce.

Protože regresní a korelační analýzu provádíme téměř vždy
s daty naměřenými na výběrovém souboru statistických
jednotek, je možno považovat získané výsledky pouze za
odhady pro shodné závislosti v základním (populačním)
souboru.